Le web scraping (parfois appelé harvesting) est une technique d'extraction du contenu de sites Web,
via un script ou un programme,
dans le but de le transformer pour permettre son utilisation dans un autre contexte, par exemple le référencement.
Dans un cadre entreprise, qui est elle bien sûr propriétaire de ses données, cette technologie permet de réduire significativement le temps et le coût des intégrations d'applications d'entreprise.
Pour scraper des sites web, Python dispose de plusieurs librairies permettant d'automatiser ce travail:
| Nom du langage | Logo | lien vers la documentation |
|---|---|---|
| BeautifulSoup | ![]() |
Documentation |
| Scrapy | Documentation | |
| Selenium | Documentation | |
| splash | ![]() |
Documentation |
le web scaping aura la possibilité de récupérer des données à partir des données affichées dans le navigateur. Les langages gérant l'affichage d'un site web sont :
| Nom du langage | définition |
|---|---|
| html | Le HTML est le langage de balisage conçu pour représenter les pages web. |
| CSS | le CSS décrit la présentation des documents HTML et XML. |
| Javascript | JavaScript est un langage de programmation principalement employé dans les pages web interactives |